#AI 訓練
高盛:中國網際網路行業策略大轉向,雲和資料中心成top pick,超越遊戲
高盛在3季度業績發佈及調研後,對中國網際網路行業策略大轉向:把“雲與資料中心”提到了首選類股,排到了遊戲和出行之前。AI帶來的算力需求和資本開支(Capex)擴張,已經是最確定的增長邏輯了。1、最大預期差:雲與資料中心成為“新王” ☁️高盛這次非常堅決,把雲和資料中心類股從原來的第三提升到第一。邏輯很硬:AI訓練和推理的需求持續爆發,加上巨頭們都在搞“多晶片策略”,資料中心的訂單量非常飽滿。核心邏輯:不僅是輝達,國產晶片的供應上來後,算力基建的利用率和回報率都在提升。2、AI助手的“入口之戰”是個大隱憂 🤖報告專門討論了一個長線風險:字節跳動的“豆包手機助手”。這東西能直接在作業系統層面(OS-level)幫使用者跨APP操作,比如比價、點外賣。這對現有的APP生態是個降維打擊。雖然目前微信等巨頭因為安全隱私原因封鎖了它的介面,但這種“超級AI代理”對使用者流量入口的爭奪,是未來幾年最大的變數。字節系App現在霸榜iOS免費榜前五中的四席,攻勢很猛。3、本地生活:燒錢該結束了,關注利潤修復 🛵外賣和即時零售打得太凶,三季度行業大概虧了700億人民幣,太誇張了。高盛判斷,這種非理性的補貼戰不可持續。格局推演:美團、阿里、京東的市場份額最終可能會穩定在 5:4:1。美團:雖然長期單均利潤預期被微調(從0.8元降到0.7元),但在這個價位,壞消息已經Price-in了,隨著補貼退坡,利潤修復是大機率事件。4、最新的“核心股票池”名單 📝根據最新的類股偏好,高盛更新了首選名單:雲/資料中心:阿里巴巴、萬國資料、世紀互聯。遊戲(防守反擊):騰訊、網易。出行(格局穩固):滴滴、滿幫。電商(新面孔):快手(新增為關鍵推薦,看好其AI模型Kling的突破和電商變現)。5、估值怎麼看? 📊現在中概網際網路類股的2026年預期市盈率(P/E)中位數大概是18倍。之前的上漲主要靠殺估值修復(Multiple Expansion),接下來的漲幅,必須得靠實打實的每股收益(EPS)增長來驅動了。所以,選利潤兌現能力強的公司,比單純博反彈要穩妥得多。總的來說,風向變了,硬科技基礎設施(資料中心)的優先順序在上升,而純流量變現的生意面臨AI新玩法的挑戰。 (硬AI)
4倍性能、50%成本降幅!亞馬遜強勢推出Trainium3晶片,AI訓練推理增添新選項!
當地時間 12 月 2 日,亞馬遜雲端運算服務(AWS)在美國拉斯維加斯舉辦的年度雲端運算盛會“AWS re:Invent 2025”上發佈了全新的自研 Trainium3 晶片,以及採用 Trainium3 晶片的 Trainium3 UltraServer 伺服器。根據首席執行官 Matt Garman 的介紹,新款 Trainium3 晶片的性能是前代產品的 4 倍,並採用台積電 3 奈米工藝製造。每個晶片都配備了 144 GB 的 HBM3E 記憶體,記憶體頻寬為 4.9 TB/s,提供 2.52 FP8 PFLOPs 的算力。(來源:社交媒體 X)Trainium3 UltraServer 單機最多整合 144 顆 Trainium3 晶片,總共配備 20.7 TB HBM3E、706 TB/s 記憶體頻寬,可提供最高 362 FP8 PFLOPS 的算力,時延降低 4 倍,可更快訓練超大模型,並大規模支撐推理服務。其計算性能比 Trainium2 UltraServer 高出 4.4 倍,能源效率高出 4 倍,記憶體頻寬也高出近 4 倍。在使用 OpenAI 的開源大模型 GPT-OSS 進行測試時,Trainium3 UltraServer 的單晶片吞吐量可提升 3 倍,推理響應速度提升 4 倍。這意味著企業可以在更小的基礎設施規模下應對峰值需求,顯著最佳化使用者體驗,同時降低每次推理請求的成本。AWS 以垂直整合方式打造 Trainium3 UltraServer,從晶片架構到軟體棧全鏈路協同。核心之一是新一代網路基礎設施,用於消除傳統分佈式 AI 計算的通訊瓶頸:NeuronSwitch-v1 提供 2 倍 的 UltraServer 內部頻寬;增強型 Neuron Fabric 將晶片間通訊延遲降低至 10 微秒以內。這種強大的配置使得它非常適合處理下一代最前沿的 AI 工作負載,例如:訓練大規模AI模型,可以將複雜模型的訓練時間從數月縮短至數周;處理高並行的 AI 推理請求,以低延遲即時處理數百萬使用者的請求,例如智能對話、視訊生成等;運行特定複雜任務,如智能體系統、專家混合模型和大規模強化學習等。包括 Anthropic、Karakuri、Metagenomi、NetoAI、Ricoh、Splash Music 等客戶,已經借助 Trainium 將訓練和推理成本降低最多 50%。其中,Decart 在即時生成式視訊方面實現了 4 倍推理速度提升,成本僅為 GPU 的一半;而 Amazon Bedrock 已經在生產環境中使用 Trainium3 提供服務。(來源:社交媒體 X)對於需要更大規模的客戶,EC2 UltraCluster 3.0 可連線千台 UltraServer,構成擁有多達 100 萬顆 Trainium 晶片的叢集——是上一代的 10 倍。這使得此前完全不可能的任務成為現實:從在兆級 token 資料集上訓練多模態模型,到為數百萬並行使用者提供即時推理服務。自研晶片是亞馬遜的重要戰略項目之一,目標是避免過度依賴昂貴的輝達硬體。而對於 Trainium3 來說,一個關鍵問題在於:有多少大型外部客戶會願意採用這套硬體。尤其是在Google旗下的 TPU 持續搶佔 AI 晶片市場的背景下。另一個重要變數是 AI 初創公司 Anthropic 的晶片採購分配。今年 10 月,Anthropic 宣佈與Google達成合作,將使用多達 100 萬顆Google TPU 晶片,以實現除亞馬遜和輝達之外的供應多元化。Anthropic 表示,亞馬遜仍是其主要訓練合作夥伴與雲服務提供商。該公司預計,到今年年底,將使用超過 100 萬顆 Trainium 2 晶片,其中包括運行在擁有近 50 萬顆 Trainium 處理器的 Project Rainier 超級電腦之上。此外,AWS 也預告了下一代 AI 訓練晶片 Trainium4的研發進展。其在各方面都將實現大幅性能躍升,包括處理性能(FP4)至少提升 6 倍、FP8 性能提升 3 倍、記憶體頻寬提升 4 倍。結合持續的軟硬體最佳化,其實際性能提升將遠超基準數值。其中,FP8 提升 3 倍是一次基礎性飛躍。模型訓練至少快 3 倍,推理吞吐量也至少提升 3 倍,並且隨著軟體最佳化將獲得進一步加成。FP8 已成為現代 AI 工作負載在精度與效率之間的行業標準格式。為進一步提升單機擴展性能,Trainium4 將支援 NVIDIA NVLink Fusion高速互聯技術。該能力將使 Trainium4、AWS Graviton 處理器及 Elastic Fabric Adapter(EFA)能在統一 MGX 機架內協同工作,為客戶提供支援 GPU 與 Trainium 的成本更優、性能更強的機架級 AI 基礎設施。這一整合將建構一個靈活、高性能的平台,最佳化應對未來對訓練與推理都極其苛刻的 AI 工作負載。 (問芯)
挑戰國際巨頭,中國初創公司發佈新一代AI訓練晶片
一家由中國科技企業家創立的美國初創公司Enther AI,近日正式發佈了其首款自研AI訓練晶片——Enther TPU。據公司宣稱,該晶片在運行特定AI模型時,其速度可達輝達2020年發佈的A100 GPU的1.5倍,能效提升42%。Enther AI由前Google工程師郭志雄(Zhixiong Guo)於2023年創立。公司在推出Enther TPU的同時,也展示了整合該晶片的E1伺服器節點。每個E1節點搭載4顆Enther TPU,可提供高達10.8 petaFLOPS的BF16訓練算力。Enther AI進一步提出了建構萬卡叢集的藍圖,其設計的“E1超級叢集” 通過光學電路切換網路連線多達2500個E1節點(即10,000顆TPU),旨在為兆參數大模型提供訓練支援。值得注意的是,儘管Enther AI總部位於美國,但其研發活動具有鮮明的跨太平洋特徵。公司的研發團隊主要在中國,這使其發展路徑和動向備受業界關注。在軟體生態方面,Enther AI推出了E-SDK,聲稱其能“無縫”將基於NVIDIA GPU的AI訓練項目遷移至其Enther TPU平台上,並支援PyTorch、JAX等主流AI框架。不過,目前該晶片的公開性能資料均來自Enther AI自身的測試報告,尚未有第三方機構的獨立驗證。此外,Enther TPU作為市場新入者,其實際量產交付能力、在更廣泛AI工作負載下的穩定性以及能否成功建構起持續的開發者生態,仍是其未來需要面對的關鍵挑戰。在全球AI算力競爭日益激烈的背景下,Enther AI的亮相為市場帶來了新的選擇。然而,從技術發佈到獲得產業界的廣泛認可和採用,這家年輕的初創公司仍有很長的路要走。其後續發展,特別是產品的實際應用表現,將成為衡量其成功與否的真正試金石。 (晶片行業)